是不是算力堆得越多,AI大模型就一定越聪明?
来源: 科普中国 发布时间:2026-09-17
截至2026年6月底,我国智能算力规模达到2185 EFLOPS(FP16),同比增长177%。全国已建成40多个万卡级智算集群。另一边,DeepSeek、KIMI等大模型迭代周期也越来越短,难道集群建得越大模型就变得越聪明?并非如此,模型的能力不仅仅取决于芯片的数量,更受到数据、算法、网络、存储和软件等一系列因素的影响,只有算力、网络、存储和软件的协同设计,才能将算力真正转化为大模型能力。
一、 智算进入新阶段:规模仍在增长,评价标准正在改变
算力是大模型发展的重要基石。通常情况下,增加算力有助于模型学习更多知识、处理更复杂的任务,这也是业界持续追求更大规模算力的原因。不过,算力规模的增长并不等同于模型能力的提升。算力要转化为模型智能,还需要数据、算法、网络、存储和软件等多环节协同发力。数据质量不高、算法效率不足或数据供给跟不上,都会造成算力浪费。因此,算力的增加并不意味着模型可以等比例“变聪明”。
将智算集群从一百张卡扩展到一千张卡,训练速度和模型能力通常不会提升十倍,原因在于,训练过程中算力芯片需要频繁同步数据。随着集群规模扩大,网络拥塞、软件适配和局部故障带来的工程复杂度急剧上升。一个万卡集群,远非简单地把一万张卡堆叠在一起,真正的挑战在于如何让它们长期、稳定、高效地运行。因此,衡量一个智算中心的能力,不能只看峰值算力,更要看有效算力。
当前,产业格局正在经历深刻变化,从以训练为主走向训推并重,从集中部署走向枢纽、区域和边缘协同,从单一架构走向多元异构融合共生。这些变化意味着算力系统的设计与调优,正在从硬件堆叠走向全栈协同。未来,智算竞争的重点将不再是“采购多少设备”,在于能否真正打通“算、存、网、管、效”全链路,实现系统级的协同与效能释放。
二、万卡集群不只要“建得大”,更要“跑得稳”
超大规模集群要形成有效算力,离不开一套完整的技术体系,由算力基础设施、网络连接、算力平台和运营调度共同组成:GPU芯片提供计算,网络和存储负责数据传输与供给,平台完成资源池化、模型部署和软件适配,调度系统按任务需求分配资源。各环节协同配合,才能使分散设备组成稳定运行、按需调用的智算生产系统。
沿着这一思路,中国移动围绕卡间互联和异构适配等环节形成了多项开放技术创新实践。
1、卡间互联:既要高性能,也要开放生态
大模型训练需要多个GPU芯片间频繁交换参数,通常采用专用高速总线、交换芯片来提升通信带宽。现有方案虽然性能较高,但接口和生态仍存在差异,芯片、整机和交换设备往往需要分别适配。如何兼顾高性能与开放性,是产业需要解决的问题。中国移动原创提出OISA全向智感互联,以开放、统一的接口推动GPU芯片与交换芯片高效互联。OISA IP商用产品支持800G带宽和百纳秒级时延,并面向产业链开放集成,支持广大GPU向超节点形态升级。
2、异构适配:让用户不再重复“造轮子”
AI应用要在GPU上运行,离不开编译工具链,它负责把程序“翻译”成芯片能够执行的指令。不同厂商的芯片编译工具链往往互不兼容,上层AI应用容易与特定工具链绑定;一旦更换芯片,就可能面临重复开发、迁移成本高等问题,也不利于形成开放的智算生态。针对多种GPU并存的现状,中国移动原创提出算力原生技术,打造兼容多厂商、多种硬件的统一基础软件系统“芯合”,贯通应用跨架构开发、编译、优化、迁移和部署全流程。“芯合”商用产品现已支持泛AI应用跨架构开发、异构算力统一池化和推理性能优化,并在交通、金融、医疗等行业落地。
三、从“东数西算”到“算力成网”
国家层面,“东数西算”已形成8个国家算力枢纽节点和10个国家数据中心集群,全国已建成40多个万卡级智算集群。全国一体化算力网建设进一步推动跨区域、跨主体互联。截至2026年6月底,全国算力设施上架率达到71.4%,围绕国家枢纽节点已建成70余条算力大通道,算力布局正从单中心转向“枢纽—区域—边缘”协同。
围绕这一布局,产业各方也在加快补齐短板:芯片企业提升计算密度和能效,设备企业研发超节点和无损网络,运营商和互联网企业探索异构池化、训推一体与跨域调度,数据中心加快应用液冷、绿电和算电协同。中国移动也在这一进程中完善智算供给和算网协同能力:截至2026年中,智算总规模达到112.7 EFLOPS(FP16);呼和浩特、哈尔滨两大超万卡集群已投入运行,具备万卡并行训练、断点自动续训和算存网一站式调度能力,实现千卡稳定训练25天、万卡稳定训练14天;省际骨干400G OTN网络基本覆盖全国,“1—5—20毫秒”三级算力时延圈持续完善;算网大脑3.0已部署于多个国家级、枢纽级和区域级平台。
四、算力决定能力上限,体系决定算力能否兑现
所以,算力堆得越多,大模型就一定越聪明吗?更准确的回答是:在数据、算法和工程条件相匹配的前提下,更多有效算力能够抬高模型能力上限;如果数据质量不足,或网络、软件和调度能力未能跟上,新增芯片只会增加成本。
正因如此,从国家推进枢纽布局和全国一体化算力网,到产业界探索开放互联、异构资源池,再到中国移动围绕OISA、算力原生开展技术攻关,各方实践都指向同一目标:既要扩大供给,更要提升算力转化效率。
未来,大模型竞争仍离不开规模,但更关键的是把算力转化为生产力。只有推动算、存、网、管、效与能源协同发展,让每张卡少等待、每项任务匹配合适资源、每份算力得到有效调用,AI才能从“算得多”真正走向“算得好、用得好”。
作者:陈佳媛 中国移动研究院网络与IT技术研究所技术经理
艾文涛 中国移动研究院网络与IT技术研究所研究员
王羽琪 中国移动研究院网络与IT技术研究所研究员
班有容 中国移动研究院网络与IT技术研究所研究员
审核:张昊 中国移动集团首席专家、中国移动研究院网络与IT技术研究所所长
策划:阎冬 陈昊
出品:科普中国×中国移动科学技术协会
版权与免责声明
【1】本网站凡注明“学会秘书处”的所有作品,版权均属于四川省金属学会所有,未经书面授权,任何媒体、网站或个人不得转载、摘编或利用其它方式使用上述作品。已经本网站协议授权的媒体或网站,应在授权范围内使用上述作品,并注明“来源:四川省金属学会”。违者本网站将追究其相关法律责任。
【2】本网站凡注明“来源:XXX(非学会秘书处)”的作品,均转载自其它媒体,登载此作品出于传递更多信息之目的,不代表学会观点或证实其描述,不对其真实性负责。作品内容仅供参考,如转载稿件涉及版权等问题,请在两周内来电或来函与四川省金属学会联系。
